一文读懂Kimi K3 预训练|3T模型,不再是魔法
一文读懂Kimi K3 预训练|3T模型,不再是魔法7月几天之内,中国大模型行业接连出现了两个超过2万亿参数的模型。
搜索
7月几天之内,中国大模型行业接连出现了两个超过2万亿参数的模型。
“推理轻量化,训练提效 25%,前端效果同样惊艳。 ”
听说K3这么猛,又属于免费开源,于是就有同学跑来问我一个特别真实的问题。听说K3这么猛,又属于免费开源,于是就有同学跑来问我一个特别真实的问题。这个问题问得太好了,好到我可以直接拿它当这篇文章的选题。因为它正好踩中了开源模型最反常识的地方。
Kimi K3 正式开源以后,最先冲到 Hugging Face 准备下载的人,滑不了几下,就会看到一个数字:2.8T。
最近,月之暗面 kimi 正式开源 Kimi K3 完整模型权重,Kimi K3 是一款总参数量达 2.8 万亿、上下文窗口达 100 万 token 的 MoE 大模型,更是全球首个落地的近 3 万亿参数级开源大模型,引起业界热议。
尽管Codex官方是支持第三方模型接入的,但是Codex 走的是 Responses API,而 K3 给的是 OpenAI 兼容的 Chat Completions API,两套协议对不上。所以Kimi 官方给的方案就是本地挂上CC Switch 或 codeproxy 这类第三方的转换器。
它把架构、训练和 Agent infra连接成了一套完整系统。
你要说最近AI行业里,最热的、被讨论最多的一件事。
就在刚刚,全球首个3万亿参数级开源模型Kimi K3正式开源!https://github.com/MoonshotAI/Kimi-K3/tree/main。Moonshot AI宣布,发布Kimi K3的模型权重、技术报告,并开源支撑Kimi K3模型训练的关键Infra技术:MoonEP、FlashKDA和AgentEnv。
凌晨,我在一片黑屏上按下鼠标。